`:top
`!MapReduce`! ist ein vom Unternehmen `F33f`_`[Google Inc.`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Google_Inc.]`_`f eingeführtes Programmiermodell für `F33f`_`[nebenläufige`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Nebenläufigkeit]`_`f Berechnungen über (mehrere `F33f`_`[Petabyte`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Petabyte]`_`f`:cite-ref-1[`F5bf`_`[1`#cite-note-1]`_`f]) große Datenmengen auf `F33f`_`[Computerclustern`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Computercluster]`_`f. `*MapReduce`* ist auch der Name einer Implementierung des Programmiermodells in Form einer Software-Bibliothek. Beim MapReduce-Verfahren werden die Daten in drei Phasen verarbeitet (Map, Shuffle, Reduce), von denen zwei durch den Anwender spezifiziert werden (Map und Reduce). Dadurch lassen sich Berechnungen parallelisieren und auf mehrere Rechner verteilen. Bei sehr großen Datenmengen ist die Parallelisierung unter Umständen schon deshalb erforderlich, weil die Datenmengen für einen einzelnen Prozess (und das ausführende Rechnersystem) zu groß sind.
Das Programmiermodell wurde durch die in der `F33f`_`[funktionalen Programmierung`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Funktionale_Programmierung]`_`f häufig verwendeten Funktionen `*map`* und `*reduce`* inspiriert,`:cite-ref-map-2-0[`F5bf`_`[2`#cite-note-map-2]`_`f] auch wenn die Arbeitsweise der Bibliothek davon abweicht.`:cite-ref-3[`F5bf`_`[3`#cite-note-3]`_`f] 2010 wurde für MapReduce ein US-Patent erteilt.`:cite-ref-4[`F5bf`_`[4`#cite-note-4]`_`f] Der wesentliche Beitrag von MapReduce ist jedoch das zu Grunde liegende System, das die Berechnungen stark parallelisiert, die Reorganisation der Daten im Shuffle-Schritt optimiert, und automatisch auf Fehler im Cluster reagieren kann, wie beispielsweise den Ausfall von kompletten Knoten.
>>Contents
• `F0af`_`[Arbeitsweise`#arbeitsweise]`_`f
• `F0af`_`[Illustration des Datenflusses`#illustration-des-datenflusses]`_`f
• `F0af`_`[Definition der MapReduce-Funktion`#definition-der-mapreduce-funktion]`_`f
• `F0af`_`[Definition der Map- und Reduce-Funktionen`#definition-der-map-und-reduce-funktionen]`_`f
• `F0af`_`[Map-Phase`#map-phase]`_`f
• `F0af`_`[Shuffle-Phase`#shuffle-phase]`_`f
• `F0af`_`[Reduce-Phase`#reduce-phase]`_`f
• `F0af`_`[Combine-Phase`#combine-phase]`_`f
• `F0af`_`[Beispiel: Verteilte Häufigkeitsanalyse mit MapReduce`#beispiel-verteilte-h-ufigkeitsanalyse-mit-mapreduce]`_`f
• `F0af`_`[Problem`#problem]`_`f
• `F0af`_`[Angabe der Map- und Reduce-Funktionen`#angabe-der-map-und-reduce-funktionen]`_`f
• `F0af`_`[Map-Phase`#map-phase]`_`f
• `F0af`_`[Shuffle-Phase`#shuffle-phase]`_`f
• `F0af`_`[Reduce-Phase`#reduce-phase]`_`f
• `F0af`_`[Insgesamt`#insgesamt]`_`f
• `F0af`_`[Beispielhafte Berechnung`#beispielhafte-berechnung]`_`f
• `F0af`_`[Weitere Beispiele`#weitere-beispiele]`_`f
• `F0af`_`[Verallgemeinerung`#verallgemeinerung]`_`f
• `F0af`_`[Siehe auch`#siehe-auch]`_`f
• `F0af`_`[Weblinks`#weblinks]`_`f
• `F0af`_`[Fachartikel`#fachartikel]`_`f
• `F0af`_`[Software`#software]`_`f
• `F0af`_`[Einzelnachweise`#einzelnachweise]`_`f
-─
>>Arbeitsweise
>>>Illustration des Datenflusses
Das obige Bild illustriert den Datenfluss bei der MapReduce-Berechnung.
• Map-Phase:
• Die Eingabedaten `*(D, A, T, A)`* werden auf eine Menge von Map-Prozessen verteilt (illustriert durch bunte Rechtecke), welche jeweils die vom Nutzer bereitgestellte Map-Funktion berechnen.
• Die Map-Prozesse werden idealerweise parallel ausgeführt.
• Jede dieser Map-Instanzen legt Zwischenergebnisse ab (illustriert durch pinkfarbene Sterne).
• Von jeder Map-Instanz fließen Daten in eventuell verschiedene Zwischenergebnisspeicher.
• Shuffle-Phase:
• Die Zwischenergebnisse werden gemäß den Ausgabeschlüsseln, die von der Map-Funktion produziert wurden, neu verteilt, sodass alle Zwischenergebnisse mit demselben Schlüssel im nächsten Schritt auf demselben Computersystem verarbeitet werden.
• Reduce-Phase:
• Für jeden Satz an Zwischenergebnissen berechnet jeweils genau ein Reduce-Prozess (illustriert durch violette Rechtecke) die vom Nutzer bereitgestellte Reduce-Funktion und damit die Ausgabedaten (illustriert durch violette Kreise `*X, Y`* und `*Z`*).
• Die Reduce-Prozesse werden idealerweise ebenfalls parallel ausgeführt.
>>>Definition der MapReduce-Funktion
Die MapReduce-Bibliothek realisiert eine `F33f`_`[Funktion`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Funktion_(Mathematik)]`_`f, welche aus einer `F33f`_`[Liste`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Liste_(Datenstruktur)]`_`f von `F33f`_`[Schlüssel-Wert-Paaren`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Schlüssel-Wert-Paar]`_`f (Eingabeliste) eine neue Liste von Schlüssel-Wert-Paaren (Ausgabeliste) berechnet:
M a p R e d u c e : ( K × × V ) ∗ ∗ → → ( L × × W ) ∗ ∗ [ ( k 1 , v 1 ) , … … , ( k n , v n ) ] ↦ ↦ [ ( l 1 , w 1 ) , … … , ( l m , w m ) ] {\\displaystyle {\\begin{aligned}\\mathrm {MapReduce} :(K\\times V)^{*}&\\to (L\\times W)^{*}\\\\{\\lbrack (k_{1},v_{1}),\\ldots ,(k_{n},v_{n})\\rbrack }&\\mapsto \\lbrack (l_{1},w_{1}),\\ldots ,(l_{m},w_{m})\\rbrack \\end{aligned}}}
Erläuterung:
• Die Mengen K {\\displaystyle K} und L {\\displaystyle L} enthalten `!Schlüssel`!, die Mengen V {\\displaystyle V} und W {\\displaystyle W} enthalten `!Werte`!.
• Alle Schlüssel k ∈ ∈ K {\\displaystyle k\\in K} sind vom gleichen `F33f`_`[Typ`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Datentyp]`_`f, z. B. Strings.
• Alle Schlüssel l ∈ ∈ L {\\displaystyle l\\in L} sind vom gleichen Typ, z. B. ganze Zahlen.
• Alle Werte v ∈ ∈ V {\\displaystyle v\\in V} sind vom gleichen Typ, z. B. Atome.
• Alle Werte w ∈ ∈ W {\\displaystyle w\\in W} sind vom gleichen Typ, z. B. Gleitkommazahlen.
• Wenn A {\\displaystyle A} und B {\\displaystyle B} Mengen sind, so ist mit A × × B {\\displaystyle A\\times B} die Menge aller Paare ( a , b ) {\\displaystyle (a,b)} gemeint, wobei a ∈ ∈ A {\\displaystyle a\\in A} und b ∈ ∈ B {\\displaystyle b\\in B} (`F33f`_`[kartesisches Produkt`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Kartesisches_Produkt]`_`f).
• Wenn M {\\displaystyle M} eine Menge ist, so ist mit M ∗ ∗ {\\displaystyle M^{*}} die Menge aller endlichen Listen mit Elementen aus M {\\displaystyle M} gemeint (angelehnt an den `F33f`_`[Kleene-Stern`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Kleene-Stern]`_`f) – die Liste kann auch leer sein.
>>>Definition der Map- und Reduce-Funktionen
Der Nutzer konfiguriert die Bibliothek über die Bereitstellung der beiden Funktionen Map und Reduce, die wie folgt definiert sind:
M a p : K × × V → → ( L × × W ) ∗ ∗ ( k , v ) ↦ ↦ [ ( l 1 , x 1 ) , … … , ( l r k , x r k ) ] {\\displaystyle {\\begin{aligned}\\mathrm {Map} :K\\times V&\\to (L\\times W)^{*}\\\\(k,v)&\\mapsto \\lbrack (l_{1},x_{1}),\\ldots ,(l_{r_{k}},x_{r_{k}})\\rbrack \\end{aligned}}}
bzw.
R e d u c e : L × × W ∗ ∗ → → X ∗ ∗ ( l , [ y 1 , … … , y s l ] ) ↦ ↦ [ w 1 , … … , w m l ] {\\displaystyle {\\begin{aligned}\\mathrm {Reduce} :L\\times W^{*}&\\to X^{*}\\\\\\left(l,{\\lbrack y_{1},\\ldots ,y_{s_{l}}\\rbrack }\\right)&\\mapsto \\lbrack w_{1},\\ldots ,w_{m_{l}}\\rbrack \\end{aligned}}}
>>>Map-Phase
• Map bildet ein Paar, bestehend aus einem Schlüssel k {\\displaystyle k} und einem Wert v {\\displaystyle v} , auf eine Liste von neuen Paaren ( l r , x r ) {\\displaystyle (l_{r},x_{r})} ab, welche die Rolle von `!Zwischenergebnissen`! spielen. Die Werte x r {\\displaystyle x_{r}} sind vom gleichen Typ wie die Endergebnisse w i {\\displaystyle w_{i}} .
• Bei einem neuen Paar ( l , x ) {\\displaystyle (l,x)} verweist der von Map vergebene Schlüssel l {\\displaystyle l} dabei auf eine Liste T l {\\displaystyle T_{l}} von Zwischenergebnissen, in welcher der von Map berechnete Wert x {\\displaystyle x} gesammelt wird.
• Die Bibliothek ruft für jedes Paar in der Eingabeliste die Funktion Map auf.
• All diese Map-Berechnungen sind voneinander unabhängig, so dass man sie nebenläufig und verteilt auf einem Computercluster ausführen kann.
>>>Shuffle-Phase
• Bevor die Reduce-Phase starten kann, müssen die Ergebnisse der Map-Phase nach ihrem neuen Schlüssel l {\\displaystyle l} in Listen T l {\\displaystyle T_{l}} gruppiert werden.
• Wenn Map- und Reduce-Funktionen nebenläufig und verteilt ausgeführt werden, wird hierfür ein koordinierter Datenaustausch notwendig.
• Die Performanz eines Map-Reduce-Systems hängt maßgeblich davon ab, wie effizient die Shuffle-Phase implementiert ist.
• Der Nutzer wird in der Regel nur über die Gestaltung der Schlüssel l {\\displaystyle l} auf die Shuffle-Phase Einfluss nehmen. Daher reicht es, sie einmalig gut zu optimieren, und zahlreiche Anwendungen können hiervon profitieren.
>>>Reduce-Phase
• Sind alle Map-Aufrufe erfolgt bzw. liegen alle Zwischenergebnisse in T l {\\displaystyle T_{l}} vor, so ruft die Bibliothek für jede Zwischenwertliste die Funktion Reduce auf, welche daraus eine Liste von Ergebniswerten w j {\\displaystyle w_{j}} berechnet, die von der Bibliothek in der Ausgabeliste als Paare ( l , w j ) {\\displaystyle (l,w_{j})} gesammelt werden.
• Auch die Aufrufe von Reduce können unabhängig auf verschiedene Prozesse im Computercluster verteilt werden.
Anmerkung: Diese Darstellung war etwas vereinfacht, denn in der Regel wird die Steuerung des MapReduce Verfahrens eine Anzahl R {\\displaystyle R} von Reduce-Prozessen anstreben, so dass, wenn es für mehr als R {\\displaystyle R} verschiedene Schlüssel l {\\displaystyle l} Zwischenergebnisse ( l , x ) {\\displaystyle (l,x)} gibt, Zwischenergebnisse ( l , x ) {\\displaystyle (l,x)} mit verschiedenen Schlüsseln l {\\displaystyle l} in einer gemeinsamen Liste gespeichert werden. Die entsprechenden Paare werden vor der Reduce-Berechnung nach Schlüsseln sortiert.
>>>Combine-Phase
Optional kann vor der Shuffle-Phase noch eine Combine-Phase erfolgen. Diese hat in der Regel die gleiche Funktionalität wie die Reducefunktion, wird aber auf dem gleichen Knoten wie die Map-Phase ausgeführt. Dabei geht es darum, die Datenmenge, die in der Shuffle-Phase verarbeitet werden muss, und damit die Netzwerklast zu reduzieren.`:cite-ref-map-2-1[`F5bf`_`[2`#cite-note-map-2]`_`f] Der Sinn der Combine-Phase erschließt sich sofort bei der Betrachtung des `F33f`_`[Wordcount-Beispiels`#beispiel-verteilte-h-ufigkeitsanalyse-mit-mapreduce]`_`f: Auf Grund der unterschiedlichen Häufigkeit von Wörtern in natürlicher Sprache, würde bei einem deutschen Text beispielsweise sehr oft eine Ausgabe der Form ("und", 1) erzeugt (gleiches gilt für Artikel und Hilfsverben). Durch die Combine-Phase wird nun aus 100 Nachrichten der Form ("und", 1) lediglich eine Nachricht der Form ("und", 100). Dies kann die Netzwerkbelastung signifikant reduzieren, ist aber nicht in allen Anwendungsfällen möglich.
>>Beispiel: Verteilte Häufigkeitsanalyse mit MapReduce
>>>Problem
Man möchte für umfangreiche Texte herausfinden, wie oft welche Wörter vorkommen.
>>>Angabe der Map- und Reduce-Funktionen
`B100`F9d9 map(String name, String document):`f`b
`B100`F9d9 // name: document name ("key")`f`b
`B100`F9d9 // document: document contents ("value")`f`b
`B100`F9d9 for each word w in document:`f`b
`B100`F9d9 EmitIntermediate(w, 1);`f`b
`B100`F9d9`f`b
`B100`F9d9 reduce(String word, Iterator partialCounts):`f`b
`B100`F9d9 // word: a word ("key")`f`b
`B100`F9d9 // partialCounts: a list of aggregated partial counts ("values")`f`b
`B100`F9d9 // for 'word'`f`b
`B100`F9d9 int result = 0;`f`b
`B100`F9d9 for each v in partialCounts:`f`b
`B100`F9d9 result += v;`f`b
`B100`F9d9 Emit(word, result);`f`b
>>>Map-Phase
• Map bekommt jeweils einen Dokumentnamen `*name`* und ein Dokument `*document`* als `F33f`_`[Zeichenkette`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Zeichenkette]`_`f übergeben.
• Map durchläuft das Dokument Wort für Wort.
• Jedes Mal, wenn ein Wort `*w`* angetroffen wird, wandert eine 1 in die `*w`*-Zwischenergebnisliste (falls diese noch nicht existiert, wird sie angelegt).
• Ist man mit allen Wörtern durch und hat der Text insgesamt `*n`* verschiedene Wörter, so endet die Map-Phase mit `*n`* Zwischenergebnislisten, jede für ein anderes Wort sammelnd, welche so viele 1-Einträge enthält, wie das entsprechende Wort im Dokument gefunden wurde.
• Eventuell liefen viele Map-Instanzen gleichzeitig, falls der Bibliothek mehrere Wörter und Dokumente übergeben wurden.
>>>Shuffle-Phase
• Die Zwischenergebnislisten von mehreren Prozessen / Systemen für das gleiche Wort `*w`* werden zusammengefasst, und auf die Systeme für die Reducer verteilt.
>>>Reduce-Phase
• Reduce wird für das Wort `*word`* und die Zwischenergebnisliste `*partialCounts`* aufgerufen.
• Reduce durchläuft die Zwischenergebnisliste und addiert alle gefundenen Zahlen auf.
• Die Summe result wird an die Bibliothek zurückgegeben, sie enthält, wie oft das Wort `*word`* in allen Dokumenten gefunden wurde.
• Die Zwischenergebnisse konnten parallel, durch gleichzeitige Reduce-Aufrufe, berechnet werden.
>>>Insgesamt
• Aus einer Liste von Dokumentnamen und Dokumenten wird eine Liste von Worten und Worthäufigkeiten generiert.
>>>Beispielhafte Berechnung
Zum Beispiel wäre folgende Berechnung auf einem `F33f`_`[klassischen Text`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Das_Lied_von_der_Glocke]`_`f denkbar:
`B100`F9d9 Text = "Fest gemauert in der Erden`f`b
`B100`F9d9 Steht die Form, aus Lehm gebrannt.`f`b
`B100`F9d9 Heute muß die Glocke werden,`f`b
`B100`F9d9 Frisch, Gesellen! seid zur Hand.`f`b
`B100`F9d9 Von der Stirne heiß`f`b
`B100`F9d9 Rinnen muß der Schweiß,`f`b
`B100`F9d9 Soll das Werk den Meister loben,`f`b
`B100`F9d9 Doch der Segen kommt von oben."`f`b
Der Text wird in Sätze aufgeteilt, dabei bietet sich eine `F33f`_`[Normalisierung`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Normalisierung_(Text)]`_`f an, indem man alles klein schreibt und die Satzzeichen entfernt:
`B100`F9d9 Eingabeliste = [ (satz_1, "fest gemauert in der erden steht die form aus lehm gebrannt"),`f`b
`B100`F9d9 (satz_2, "heute muß die glocke werden frisch gesellen seid zur hand"),`f`b
`B100`F9d9 (satz_3, "von der stirne heiß rinnen muß der schweiß soll das werk den meister loben doch der segen kommt von oben") ]`f`b
Die Eingabeliste hat drei Paare als Elemente, wir können daher drei Map-Prozesse starten:
`B100`F9d9 P1 = Map(satz_1, "fest gemauert in der erden steht die form aus lehm gebrannt")`f`b
`B100`F9d9 P2 = Map(satz_2, "heute muß die glocke werden frisch gesellen seid zur hand")`f`b
`B100`F9d9 P3 = Map(satz_3, "von der stirne heiß rinnen muß der schweiß soll das werk den meister loben doch der segen kommt von oben")`f`b
Die Map-Aufrufe generieren diese Zwischenergebnispaare:
`B100`F9d9 P1 = [ ("fest", 1), ("gemauert", 1), ("in", 1), ("der", 1), ("erden", 1),`f`b
`B100`F9d9 ("steht", 1), ("die", 1), ("form", 1), ("aus", 1), ("lehm, 1),`f`b
`B100`F9d9 ("gebrannt", 1) ]`f`b
`B100`F9d9 P2 = [ ("heute", 1), ("muß", 1), ("die", 1), ("glocke", 1), ("werden", 1),`f`b
`B100`F9d9 ("frisch", 1), ("gesellen", 1), ("seid", 1), ("zur", 1), ("hand", 1) ]`f`b
`B100`F9d9 P3 = [ ("von", 1), ("der", 1), ("stirne", 1), ("heiß", 1), ("rinnen", 1),`f`b
`B100`F9d9 ("muß, 1), ("der", 1), ("schweiß", 1), ("soll", 1), ("das", 1),`f`b
`B100`F9d9 ("werk", 1), ("den", 1), ("meister", 1), ("loben", 1), ("doch", 1),`f`b
`B100`F9d9 ("der", 1), ("segen", 1), ("kommt", 1), ("von", 1), ("oben", 1) ]`f`b
Die Map-Prozesse liefern ihre Paare an die MapReduce-Bibliothek, welche diese in den Zwischenergebnislisten sammelt. Parallel könnte folgendes geschehen (Die gleiche Taktung der 3 Map-Prozesse ist unrealistisch, tatsächlich überlappen sich die Ausführungen. Die T_wort-Listen sind lokal pro Map-Prozess vorhanden und werden `!nicht`! zwischen den Schritten synchronisiert):
`B100`F9d9 1. Iteration:`f`b
`B100`F9d9 P1: T_fest = [ 1 ] (neu)`f`b
`B100`F9d9 P2: T_heute = [ 1 ] (neu)`f`b
`B100`F9d9 P3: T_von = [ 1 ] (neu)`f`b
`B100`F9d9`f`b
`B100`F9d9 2. Iteration:`f`b
`B100`F9d9 P1: T_gemauert = [ 1 ] (neu)`f`b
`B100`F9d9 P2: T_muß = [ 1 ] (neu)`f`b
`B100`F9d9 P3: T_der = [ 1 ] (neu)`f`b
`B100`F9d9`f`b
`B100`F9d9 3. Iteration:`f`b
`B100`F9d9 P1: T_in = [ 1 ] (neu)`f`b
`B100`F9d9 P2: T_die = [ 1 ] (neu)`f`b
`B100`F9d9 P3: T_stirne = [ 1 ] (neu)`f`b
Im vierten Schritt sieht man, dass Zwischenergebnislisten lokal für jeden Map-Prozess existieren und nicht global wiederverwendet werden können:
`B100`F9d9 4. Iteration:`f`b
`B100`F9d9 P1: T_der = [ 1 ] (neu, der 1. Map-Prozess hat noch kein T_der, nur P3)`f`b
`B100`F9d9 P2: T_glocke = [ 1 ] (neu)`f`b
`B100`F9d9 P3: T_heiss = [ 1 ] (neu)`f`b
`B100`F9d9`f`b
`B100`F9d9 5. Iteration`f`b
`B100`F9d9 P1: T_erden = [ 1 ] (neu)`f`b
`B100`F9d9 P2: T_werden = [ 1 ] (neu)`f`b
`B100`F9d9 P3: T_rinnen = [ 1 ] (neu)`f`b
`B100`F9d9`f`b
`B100`F9d9 6. Iteration`f`b
`B100`F9d9 P1: T_steht = [ 1 ] (neu)`f`b
`B100`F9d9 P2: T_frisch = [ 1 ] (neu)`f`b
`B100`F9d9 P3: T_muß = [ 1 ] (neu, der 3. Map-Prozess hat noch kein T_muß, nur P2)`f`b
Im siebten Schritt kommt dann zum ersten Mal vor, dass ein weiteres Vorkommen in einer bereits angelegten Zwischenergebnisliste gesammelt wird:
`B100`F9d9 7. Schritt`f`b
`B100`F9d9 P1: T_die = [ 1 ] (neu, der 1. Map-Prozess hat noch kein T_die)`f`b
`B100`F9d9 P2: T_gesellen = [ 1 ] (neu)`f`b
`B100`F9d9 P3: T_der = [ 1, 1 ] (beim 3. Map-Prozess seit Iteration 2 vorhandene Liste verwenden)`f`b
usw.
Nach 21 Schritten sind alle drei Map-Prozesse mit ihrer Arbeit fertig, die Map-Phase endet und es beginnt die Reduce-Phase. Die Zwischenergebnislisten, die von verschiedenen Map-Prozessen zu demselben Wort angelegt wurden, werden zusammengefügt. Für jede der entstandenen Zwischenergebnislisten (hier sortiert aufgeführt)
`B100`F9d9 reduce`f`b
`B100`F9d9 T_der = [ 1 ] ++ [ 1, 1, 1 ] -> [ 4 ]`f`b
`B100`F9d9 T_die = [ 1 ] ++ [ 1 ] -> [ 2 ]`f`b
`B100`F9d9 T_fest = [ 1 ] -> [ 1 ]`f`b
`B100`F9d9 T_gemauert = [ 1 ] -> [ 1 ]`f`b
`B100`F9d9 T_glocke = [ 1 ] -> [ 1 ]`f`b
`B100`F9d9 T_heiss = [ 1 ] -> [ 1 ]`f`b
`B100`F9d9 T_heute = [ 1 ] -> [ 1 ]`f`b
`B100`F9d9 T_in = [ 1 ] -> [ 1 ]`f`b
`B100`F9d9 T_muß = [ 1 ] ++ [ 1 ] -> [ 2 ]`f`b
`B100`F9d9 T_stirne = [ 1 ] -> [ 1 ]`f`b
`B100`F9d9 T_von = [ 1, 1 ] -> [ 2 ]`f`b
`B100`F9d9 .`f`b
`B100`F9d9 .`f`b
`B100`F9d9 . (für alle verschiedenen T-Listen)`f`b
können wir parallel einen Reduce-Prozess starten, der jeweils die Elemente aufzählt. Das Ergebnis von MapReduce sieht in etwa so aus:
`B100`F9d9 Ausgabeliste = [ ("fest", 1), ("heute", 1), ("von", 2), ("gemauert", 1),`f`b
`B100`F9d9 ("muß", 2), ("der", 4), ("in", 1), ("die", 2), .. ]`f`b
>>Weitere Beispiele
`t
| Verfahren | Map-Funktion | Reduce-Funktion |
|---|---|---|
| Verteiltes grep | Gibt die gefundene Zeile (hit) in einen Zwischenergebnisspeicher | Reicht durch ( Identische Abbildung , genauer: Projektion auf die 2. Komponente) |
| Umsatzauswertung | Schreibt für jeden Beleg die Artikelnummer und den Betrag in einen Zwischenspeicher | Addiert für jede unterschiedliche Artikelnummer die Beträge zusammen |
| Datenbanksystem | Liest, filtert und verarbeitet Teilmengen von Datensätzen | Führt Aggregatfunktionen aus |
`t
>>Verallgemeinerung
Nachdem das Verfahren 2014 bereits zehn Jahre alt ist, bietet Google seit kurzem eine Erweiterung `*Cloud Dataflow`* an, die größere Flexibilität bietet und das `F33f`_`[Cloud Computing`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Cloud_Computing]`_`f noch stärker vorantreiben soll.
>>Siehe auch
• `F33f`_`[Apache Hadoop`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Apache_Hadoop]`_`f – Java-Framework basierend auf dem MapReduce-Algorithmus
>>Weblinks
Commons
: MapReduce
– Sammlung von Bildern, Videos und Audiodateien
>>>Fachartikel
• `F33f`_`[Jeffrey Dean`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Jeffrey_Dean]`_`f, `F33f`_`[Sanjay Ghemawat`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Sanjay_Ghemawat]`_`f: `*MapReduce: Simplified Data Processing on Large Clusters`*, OSDI'04: Sixth Symposium on Operating System Design and Implementation (Dezember 2004), Online
• Colby Ranger, Ramanan Raghuraman, Arun Penmetsa, Gary Bradski, Christos Kozyrakis: `*Evaluating MapReduce for Multi-core and Multiprocessor Systems`*. (PDF; 353 kB) `F33f`_`[Stanford University`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Stanford_University]`_`f
• `*Why MapReduce Matters to SQL Data Warehousing`*. Analyse zur Einführung von MapReduce/SQL seitens Aster Data Systems und Greenplum
• Marc de Kruijf, Karthikeyan Sankaralingam: `*MapReduce for the Cell B.E. Architecture`*. (PDF; 528 kB) `F33f`_`[University of Wisconsin–Madison`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=University_of_Wisconsin–Madison]`_`f
• Hung-Chih Yang, Ali Dasdan, Ruey-Lung Hsiao, D. Stott Parker: `*Map-Reduce-Merge: Simplified Relational Data Processing on Large Clusters`*. In: `*Proc. of ACM SIGMOD`*, 2007, S. 1029–1040 (Dieses Paper zeigt, wie man MapReduce auf relationale Datenverarbeitung ausweitet)
• FLuX: Der `*Fault-tolerant`*, `*Load Balancing`* `*eXchange operator`* der `F33f`_`[UC Berkeley`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=UC_Berkeley]`_`f bietet eine Alternative zu Googles MapReduce, mit `F33f`_`[Failover`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Failover]`_`f aber zusätzlichen Implementierungskosten.
>>>Software
• Apache Hadoop MapReduce
• disco Open-Source-Projekt (Python und Erlang) des `F33f`_`[Nokia`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Nokia]`_`f Research Center
• DryadLINQ – MapReduce Implementierung von `F33f`_`[Microsoft Research`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Microsoft_Research]`_`f. Basiert auf `F33f`_`[PLINQ`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Parallel_Extensions]`_`f und Dryad.
• MATLAB MapReduce ist eine `F33f`_`[Hadoop`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Hadoop]`_`f fähige Implementierung von `F33f`_`[MathWorks`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=MathWorks]`_`f in `F33f`_`[Matlab`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Matlab]`_`f.
• Plasma MapReduce ist eine Open Source MapReduce Implementierung in `F33f`_`[Ocaml`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Ocaml]`_`f mit einem eigenen verteilten Dateisystem
• QtConcurrent Open Source C++ MapReduce Implementierung (nicht-verteilt) der `F33f`_`[Qt Development Frameworks`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Qt_Development_Frameworks]`_`f von `F33f`_`[Digia`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Digia]`_`f
• Skynet `F33f`_`[Ruby`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Ruby_(Programmiersprache)]`_`f Map/Reduce-Bibliothek
PlasmaFS. Plasma MapReduce wurde von Gerd Stolpmann (Darmstadt) entwickelt.
• Splunk.com Data Management und Analyse Engine für Big Data, welche auf MapReduce basiert
• Stratosphere PACT Programmiermodell: Erweiterung und Generalisierung des MapReduce Programmiermodells
>>Einzelnachweise
`:cite-note-1`!1.`! `F0af`_`[↑`#cite-ref-1]`_`f `*Google spotlights data center inner workings`*. (`F33f`_`[Memento`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Webarchivierung]`_`f des Originals vom 19. Oktober 2013 im `*`F33f`_`[Internet Archive`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Internet_Archive]`_`f`*) `!Info:`! Der Archivlink wurde automatisch eingesetzt und noch nicht geprüft. Bitte prüfe Original- und Archivlink gemäß Anleitung und entferne dann diesen Hinweis.@1@2Vorlage:Webachiv/IABot/news.cnet.com CNET News, Tech news blog
`:cite-note-map-2`!2.`! `F0af`_`[↑`#cite-ref-map-2-0]`_`f Jeffrey Dean, Sanjay Ghemawat: `*MapReduce: Simplified Data Processing on Large Clusters`*. `F33f`_`[Google Labs`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Google_Labs]`_`f: “Our abstraction is inspired by the map and reduce primitives present in Lisp and many other functional languages.”
`:cite-note-3`!3.`! `F0af`_`[↑`#cite-ref-3]`_`f Ralf Lämmel (`F33f`_`[Microsoft`:/page/entry.mu`zim=wikipedia_de_all_nopic_2026-01.zim|entry_path=Microsoft]`_`f): `*Google’s MapReduce Programming Model – Revisited`*. (PDF)
`:cite-note-4`!4.`! `F0af`_`[↑`#cite-ref-4]`_`f Patent US7650331B1: `*System and method for efficient large-scale data processing.`* Angemeldet am 18. Juni 2004, veröffentlicht am 19. Januar 2010, Anmelder: Google Inc, Erfinder: Jeffrey Dean, Sanjay Ghemawat.
`c`F0af`_`[↑ Back to top`#top]`_`f`a